概要
社内LLM基盤の構成選定では、GPUの性能に加えて、ホストとの接続方式を確認する必要があります。デスクトップのPCIeスロットへの直挿しと、ノートPCや小型筐体(NUCクラス)で利用するThunderbolt/USB4経由のeGPUでは、接続帯域とレイテンシが異なります。
DigitalBaseが技術資料を整理した結果をもとに、以下の観点を解説します。
- PCIe直挿しとThunderbolt eGPUの接続帯域
- LLM推論におけるデータ転送の特徴
- CPUメモリへの退避やGPU間通信を考慮した構成選定
PCIeとThunderboltの基本スペック比較
帯域の理論値を把握する
接続方式ごとの物理帯域の理論値を整理します。
PCIe(デスクトップでの標準接続)
PCI Express(片方向・x16)の理論帯域はおおよそ以下のとおりです。
| 規格 | レーン数 | 理論帯域(片方向) |
|---|---|---|
| PCIe 3.0 | x16 | 約 31.5 GB/s |
| PCIe 4.0 | x16 | 約 63.0 GB/s |
| PCIe 5.0 | x16 | 約 126.0 GB/s |
近年のコンシューマGPU(RTX 40/50シリーズなど)は、物理的にはx16スロットでも電気的にはx8動作となる構成が少なくありません。その場合、**PCIe 4.0 x8 はおおむね PCIe 3.0 x16 と同等(約32GB/sクラス)**として見積もります。
Thunderbolt 3 / 4 / 5(eGPUの主流接続)
Thunderboltは1本のケーブルでPCIeとDisplayPortなどをトンネリングする仕様であり、カタログ値の40Gbps/80Gbps/120GbpsがそのままPCIeデータ帯域として使えるわけではありません。GPU用途で押さえるべきポイントは以下です。
- Thunderbolt 3: 公称40Gbps(双方向)。PCIeとしては最大4レーンのPCIe 3.0(32Gbps)をトンネリング可能ですが、実効PCIeデータ帯域はオーバーヘッド込みで約21〜25Gbps程度とされています。
- Thunderbolt 4: 同じく40Gbps。常にPCIe 3.0 x4の32Gbpsをデータに利用可能で、TB3のようなビデオ優先の固定予約がありません。
- Thunderbolt 5: 最大120Gbps(ブーストモード)。ただしGPU用のPCIe帯域としてはx4相当にとどまり、デスクトップのPCIe x16には届きません。
GPUに供給できる実効帯域という観点では、概ね次のとおりです。
| 接続 | 実効PCIe帯域のイメージ |
|---|---|
| PCIe 4.0 x16 | 約 63 GB/s |
| PCIe 4.0 x8 | 約 32 GB/s |
| Thunderbolt 3/4 eGPU | PCIe 3.0 x4 相当(約 4 GB/s) |
| Thunderbolt 5 eGPU | PCIe 4.0 x4 相当(ただしプロトコルオーバーヘッドあり) |
つまり、Thunderbolt eGPUはGPU本体がハイエンドであっても、接続帯域はx4相当にとどまるという前提で設計を考える必要があります。
ローカルLLM/生成AIでの影響をどう評価するか
LLM推論では、モデル重みやKVキャッシュの配置によって、接続帯域の影響が異なります。
LLM推論のデータフローの特徴
多くのLLM推論は、おおむね次の流れで進みます。
- モデル重み(数GB〜数十GB)を起動時に一度だけVRAMにロードします。
- 推論中は、トークナイズ済みの入力と中間状態(KVキャッシュ)をほぼVRAM内で更新・参照します。
- CPU側とのやり取りは入力テキストと出力トークン列が中心で、データ量は比較的少なくなります。
したがって帯域を最も消費するのは起動時のモデルロードであり、推論ループでは、インターフェース帯域よりもGPUの演算性能とVRAM帯域のほうが支配的になるケースが多くなります。
Thunderboltの帯域がボトルネックになる条件
逆に、以下のケースでは帯域の影響が顕在化します。
- VRAMに収まりきらない大規模モデル: 重みの一部やKVキャッシュをCPUメモリ側へ退避している場合、毎トークンごとにThunderbolt越しの転送が発生し、スループットが大きく低下する可能性があります。
- マルチGPU/分散推論でGPU間通信をホスト経由で行う構成: GPU間のAllReduceなどの通信がすべてx4帯域に乗るため、PCIe直挿しやNVLink構成と比べて明確にスケールしにくくなります。
- 大量のEmbedding計算とCPU側データベースの連携: 1リクエストあたりのトークン数は少なくても、ベクトルやデータの往復頻度が高い場合、Thunderbolt側のI/Oの影響が顕在化します。
3点目はRAG基盤で特に注意すべき観点です。Embedding生成とベクトルDB(pgvector/HNSWなど)への問い合わせが密に連携する構成では、接続帯域がスループットの上限を規定する場面が出てきます。
PCIe直挿し vs Thunderbolt eGPU|ローカルLLM視点の整理
ここまでの情報を、ローカルLLM/生成AI用途に絞って整理します。
接続方式ごとの向き・不向き
Thunderbolt eGPUが適するケース
- すでにThunderbolt 3/4/5対応のノートPCやNUCを保有している
- 扱うモデルが7B〜13Bクラス中心で、VRAM内に収まる
- 主用途がLLM推論・軽量なLoRA学習・コード補完などである
PCIe直挿し(一体型ワークステーション)が必須に近いケース
- 30B〜70Bクラス以上のモデルを常用する
- Stable Diffusionや動画生成など、帯域依存の強いワークロードが主体である
- マルチGPU構成でスケールさせる(NVLinkやPCIeスイッチを活用する)
- サーバ用途で24時間稼働させる(Thunderboltはホットプラグ前提のコンシューマ寄り設計)
まとめ
LLM推論の構成選定では、モデル重みとKVキャッシュがVRAMに収まるか、CPUメモリとの転送やGPU間通信が発生するかを確認する必要があります。VRAM内で処理が完結する場合は、接続帯域よりもGPUの演算性能とVRAM帯域が支配的になるケースが多くなります。
大規模モデルやマルチGPUを利用する構成では、十分なVRAMを備えたGPUのPCIe直挿しを中心に検討します。GPU間の接続に加え、大容量・高速NVMe、電源、冷却を含めて構成を選定することが重要です。
